查看原文
其他

注意别踩坑!PG大表又发现一处隐患

digoal PostgreSQL码农集散地 2024-07-08

文中参考文档点击阅读原文打开, 同时推荐2个学习环境: 

1、懒人Docker镜像, 已打包200+插件:《最好的PostgreSQL学习镜像

2、有web浏览器就能用的云起实验室: 《免费体验PolarDB开源数据库

3、PolarDB开源数据库内核、最佳实践等学习图谱:  https://www.aliyun.com/database/openpolardb/activity 

关注公众号, 持续发布PostgreSQL、PolarDB、DuckDB等相关文章. 


第31期吐槽:PG 不支持分区索引,给大表埋下巨大隐患


1、产品的问题点

  • PG 不支持分区索引

  • 之前写过一篇单表不要超过8.9亿。

    什么?PG单表别超过8.9亿条记录? 》虽然17解决了那个问题,今天我要再放一个理由,总之PG大表支持就是差点意思。

2、问题点背后涉及的技术原理

  • PG的索引支持到表级别, 如果是分区表那么每个分区创建对应索引, 索引不能单独进行分区. 例如一个100亿条记录的单表, 如果要创建索引只能创建普通索引, 索引本身不能分区.

  • 或者如果这是个分区表,PG只能创建每个分区的本地索引,不能创建分区表索引分区的统一全局索引并对索引任意选择列进行分区。

3、这个问题将影响哪些行业以及业务场景

  • 当单表较大时

  • 当使用分区表时

4、会导致什么问题?

  • 单表较大时, 索引也会非常庞大, 可能带来一些问题:

    • 创建索引的耗时变长,

    • 索引深度变大导致搜索路径变深, 需要访问更多的数据块才能访问到索引的leaf node, 性能下降,

    • 单个索引巨大,无法并行回收垃圾,垃圾回收时间变长, 更容易引发数据膨胀, 性能逐渐降低.

    • 如果系统中有多个块设备、多个表空间, 由于1个索引只能存放在1个表空间内, 那么将无法很好的利用多个块设备的性能.

5、业务上应该如何避免这个坑

  • 避免单表(或单一分区)的数据量过大, 例如不超过8.9亿条记录(经验). 超过后建议分区.

    • 如果更新频率巨大, 例如建议单个分区不超过1亿条(经验)

6、业务上避免这个坑牺牲了什么, 会引入什么新的问题

  • 管理成本增加

7、数据库未来产品迭代如何修复这个坑

  • 内核层面支持分区索引, 如果是分区表则可以支持指定其他索引分区键.

    • 根据某些表达式、字段HASH、范围进行索引分区

  • 每个索引分区可以指定不同的表空间.

  • 每个索引分区可以并行进行垃圾回收


代表用户持续鞭策你们这些国产和开源数据库, 不给点压力如何成长? 欢迎兄弟姐妹们把踩过数据库的坑砸过来,  往期回顾: 
德哥邀你鞭策数据库第1期 - PG MVCC
Tom Lane老师, 求求你别挤牙膏了, 先解决xid回卷的问题吧
3 为什么增加只读实例不能提高单条SQL的执行速度?
4 德哥邀你鞭策数据库第4期-逻辑日志居然只有全局开关
第5期吐槽:经常OOM?吃内存元凶找到了:元数据缓存居然不能共享
第6期吐槽:2024了还没用上DIO,不浪费内存才怪呢!
7 第7期吐槽:今年才等来slot failover,附上海DBA招聘信息
8 第8期吐槽:高并发短连接性能怎么这么差?
9 第9期鞭策:“最先进”的开源数据库上万连接就扛不动了,怪研发咯?
10 第10期吐槽:说删库跑路的都是骗子,千万别信,他们有的宝贝你可能没有!
11 第11期吐槽:关闭FPW来提升性能,你想过后果吗! 本期彩蛋-老板提出变态的要求,你会答应吗?
12 第12期吐槽:SQL执行计划不对?能好就见鬼了!优化器还在用几十年前的参数模板,环境自适应能力几乎为零
13 第13期吐槽:十个中年人有九个发福的,数据库用久了也会变胖!这一期吐槽PG膨胀收缩之痛,tom lane啊您为啥不根治膨胀呢?
14 吐槽(鞭策)PG以来我掉了“一半流量”!老外听不得忠言逆耳吗? (本期抽奖-掌上游戏机)
15 第15期吐槽:没有全局临时表,除了难受还有哪些潜在危害?
16 空缺,因为这一期的吐槽PG社区已经落实了.
17 第17期吐槽:被DDL坑过的人不计其数!严重时引起雪崩,危害仅次于删库跑路!PG官方不支持online DDL确实后患无穷
18 第18期吐槽:都走索引了为什么还要回表访问?原来是索引里缺少了“灵魂”
19 第19期吐槽:从DuckDB导入到PG后膨胀了5倍,把存储销售乐坏了!什么情况?
20 第20期吐槽:PG17新版本这么香,为什么不升级呢?居然是因为这个
21 第21期吐槽:90%的性能抖动是缺少这个功能造成的!也是DBA害怕开发去线上跑SQL的魔咒
22 第22期吐槽:DB容灾节点延迟了,网络带宽瓶颈?用CPU换啊!该“魔法”PG还不支持!
25 第25期吐槽:PG的物理Standby无法Partial导致单元化架构/SaaS使用不灵活
99 第99期吐槽:SQL hang住锁阻塞性能暴跌!抓不到捣蛋SQL的DBA很尴尬。
26 第26期吐槽:开发者使用PG的第1件事-配置访问控制策略,体验有待加强
27 第27期吐槽:block size既大又小!谁把成年人惯成这样的?
28 想撼动Oracle,PG系国产你还不配!吐槽你连最基本的空间分配都没做好
29 吐槽PG表空间搞得跟"玩具"一样,全靠ZFS来凑
30 快改密码!你的PG密码可能已经泄露了

本期彩蛋-推荐一个公众号

这是一个国产数据库-非专业技术人的公众号
平时发一些粗浅的技术概念、招投标信息和职场杂谈。
如果技术搞累了,可以关注、轻松一下!

文章中的参考文档请点击阅读原文获得. 


欢迎关注我的github (https://github.com/digoal/blog) , 学习数据库不迷路.  

近期正在写公开课材料, 未来将通过视频号推出, 欢迎关注视频号:


继续滑动看下一个
向上滑动看下一个

您可能也对以下帖子感兴趣

文章有问题?点此查看未经处理的缓存